01 - 训 练环境为什么不是运行时沙箱
前置:不需要。读过 Agent 执行沙箱 · 01 - 为什么需要沙箱 会更顺,但不是必需。
本篇回答:生产上已经有沙箱了,为什么训练还要另做一套?两者在负载形态上到底差在哪、差多少?
本篇会用到的词:
| 词 | 意思 |
|---|---|
| RL(强化学习) | 让模型通过「试—打分—调整」来学习的训练方式。和监督微调的区别是:没有标准答案,只有一个给行为打分的函数 |
| rollout | 一次完整的「让模型去试一遍」。模型在环境里连续动作若干步,直到任务结束或超时,产出一条轨迹 |
| 轨迹(trajectory) | 一次 rollout 的完整记录:每一步的观察、模型的动作、拿到的反馈,以及最终得分 |
| 环境(environment) | 接收动作、返回观察和奖励的那个东西。对 Agent 来说,它通常就是一台装好了工具的 Linux 机器 |
| 奖励(reward) | 给一次 rollout 打的分。代码任务里通常是「测试跑没跑过」,这类可自动判定的奖励叫可验证奖励 |
| reset | 把环境恢复到初始状态,好让下一次 rollout 从同一个起点开始。这是训练环境和运行时沙箱最大的分野 |
| on-policy | 训练数据必须由「当前这一版模型」产生。它意味着环境不能提前跑完存起来,必须和训练同步产出 |